Data Domain: ALMACENAMIENTO-00009 | Protección de RAID en estado crítico
Resumen: Los sistemas Data Domain inician un apagado ordenado si se producen varias fallas de disco y la reconstrucción de RAID no puede continuar. Esta medida de protección evita la posible pérdida de datos cuando la protección RAID alcanza un estado crítico. ...
Síntomas
La alerta STORAGE-00009 se activa cuando fallan dos o más discos y no se puede continuar con la reconstrucción de RAID, ya sea porque no hay discos de repuesto disponibles o porque la reconstrucción se ha detenido.
- El sistema genera un código de evento:
STORAGE-00009 - Aparece el siguiente mensaje de alerta:
Two or more disks are failed and the RAID protection is in critical state for over a considerable period of time. If an additional disk fails, there might be permanent loss of data. The system will shut down. - Un grupo de discos RAID6 funciona en estado degradado con dos discos fallidos.
- No hay discos de repuesto disponibles para soportar la reconstrucción.
- La reconstrucción de RAID se detiene o no progresa.
- El sistema inicia un apagado ordenado para proteger la integridad de los datos.
Causa
Data Domain Operating System (DDOS) monitorea continuamente el estado de los discos y el estado de RAID. Cuando fallan dos o más discos y existe una de las siguientes condiciones, DDOS desencadena un apagado de protección del sistema:
- No hay discos de repuesto disponibles para la reconstrucción de RAID.
- La reconstrucción de RAID no avanza dentro de la ventana de tiempo monitoreada.
DDOS realiza este apagado para evitar una mayor degradación y una posible pérdida de datos permanente que resultaría de una falla de disco adicional en el grupo RAID ya crítico.
Resolución
Medidas proactivas para prevenir esta afección:
- Reemplace rápidamente los discos fallidos. Cada disco reemplazado se convierte en un repuesto disponible para futuras reconstrucciones de RAID.
- Monitoree el estado del disco regularmente y no permita que los discos fallidos se acumulen en el sistema.
- Mantenga un inventario de discos de repuesto adecuado para que la reconstrucción automática pueda comenzar inmediatamente después de una falla.
Pasos reactivos cuando se dispara STORAGE-00009:
Paso 1: Evalúe el estado actual de la protección RAID:
-
- Inicie sesión en la CLI del sistema Data Domain.
- Ejecute los siguientes comandos para evaluar el estado del disco y el estado de RAID:
# disk show state# disk show failure-history
- Cuente el número de discos en un **
Failed** Indique e identifique qué grupos de discos se ven afectados. - Ejecute el siguiente comando para confirmar si la alerta STORAGE-00009 está activa:
# alerts show current
- Determinar la gravedad de la afección:
-
Condición Nivel de riesgo Acción recomendada La alerta STORAGE-00009 está activa; La protección RAID está en estado crítico Crítico : el sistema puede apagarse para evitar la pérdida de datos Comuníquese con Dell ProSupport inmediatamente y comunique el estado crítico de RAID Varias fallas abarcan diferentes grupos de discos; Hay discos de repuesto disponibles Alta : el sistema está degradado, pero conserva la protección RAIDComuníquese con Dell ProSupport y solicite un reemplazo acelerado del discoHa fallado un solo disco; La reconstrucción de repuesto está en curso Moderada : la protección RAID6 permanece intacta Seguir el proceso estándar de reemplazo de solicitudes de servicio
-
Paso 2: Comuníquese con Dell ProSupport:
-
- Recopile la siguiente información antes de ponerse en contacto con el soporte. Esto acelera el diagnóstico y el reemplazo:
-
INFORMACIÓN NECESARIA: CÓMO OBTENERLO: Modelo del sistema y etiqueta de servicio # system show serialnoEstados actuales del disco # disk show stateHistorial de fallas de disco # disk show failure-historyAlertas activas, incluida la salida STORAGE-00009 # alerts show currentModelo de unidad y versión de firmware # disk show hardwareNúmero de discos de reemplazo pendientes Sus registros de solicitud de servicio existentes Paquete de soporte (se puede solicitar si se requiere una investigación adicional) Data Domain: Cómo recolectar un paquete de soporte de Data Domain
-
- Póngase en contacto con Dell ProSupport o con el proveedor de soporte que contrató y comuníquele claramente la situación, lo que incluye lo siguiente:
- El estado de protección de RAID (crítico, degradado o en reconstrucción).
- La cantidad de discos fallidos y grupos de discos afectados.
- Si los discos de reemplazo están pendientes de entrega.
- Recopile la siguiente información antes de ponerse en contacto con el soporte. Esto acelera el diagnóstico y el reemplazo:
Paso 3: Tome medidas de protección provisionales mientras espera discos de reemplazo:
-
- Monitoree el estado del disco mediante la ejecución de '
disk show state' al menos dos veces al día para detectar inmediatamente cualquier fallo adicional. - Reduzca las cargas de trabajo no críticas siempre que sea posible. Ponga en pausa los programas de respaldo y los trabajos de replicación no esenciales para reducir la carga de I/O en grupos de discos degradados.
- No realice un ciclo de apagado y encendido del sistema** a menos que Dell ProSupport se lo indique explícitamente.
- Si falla un disco adicional en un grupo de discos ya degradado, comuníquese inmediatamente con el soporte de Dell; no espere hasta el siguiente día laboral.
- Monitoree el estado del disco mediante la ejecución de '
Paso 4: Reemplace los discos fallidos:
-
- Reemplace los discos defectuosos tan pronto como llegue el hardware de reemplazo. Cada disco reemplazado se convierte en un repuesto disponible para la reconstrucción de RAID.
- Después del reemplazo, ejecute lo siguiente para verificar que comience la reconstrucción de RAID:
# disk show state
- Continúe monitoreando hasta que se complete la reconstrucción y el
STORAGE-00009La alerta se borra.